feat(issue5): KV Cache 临界带宽建模与 TCP/RDMA 对照流水线 - #36
Conversation
提供串行与重叠临界带宽、Prefill FLOPs/拟合、KV 字节、资源成本、统计置信区间、远端命中/RDMA 证据、不可变 Manifest 及确定性工作负载。
实现开放环负载统计、vLLM 单元执行器、远端命中与数据路径证据判定。补齐 Mooncake 双传输配置、安全 PID 编排、分阶段 Gate、结果模板和可复现验证入口。
根据远端 GPU 空闲度允许安全反转 Store 与 requester 节点。运行时从 TCP/RDMA 对照模板解析 Store、requester 与 GPU 绑定,保留解析配置作为证据,并补充配置校验和回归测试。
使用带序号与 SHA-256 的帧协议测量多连接聚合带宽和应用层 RTT,服务端回传已验证字节数,避免把未校验发送量当作有效吞吐。
按目标环境 CLI 将 Store Owner 的 host 与 port 分离传递,并增加运行目录 Manifest 生成、拓扑与 GPU 环境白名单及回归测试。
新增请求摘要与 Mooncake Prometheus 交叉验证,避免把 HTTP 成功误判为远端 KV 命中。适配 vLLM 0.23 参数和可覆盖模型配置,并用独立 session 安全回收完整进程树。补充 GPU 内存注册预检信息、provenance 白名单与回归测试。
归档两台 A40 节点的 preflight、RDMA/TCP 链路输出、请求记录、Mooncake 日志、Prometheus 快照和 SHA-256 manifest。报告明确记录 TCP 兼容性闭环通过、RDMA GPU 内存注册失败,并保留 Qwen 7B 正式矩阵为 UNKNOWN。
|
双机远端 Gate 与证据归档已补齐(提交
|
Mooncake 0.3.12 的实际默认注册路径依赖 peer-memory,原有编排未显式选择,导致不兼容主机直到运行期才批量失败。 技术方案: - 要求显式选择 dmabuf 或 peermem,并校验 CUDA 属性与内核模块 - 在启动前保存脱敏环境快照,防止注册策略证据丢失或被覆盖 - 归档双节点单变量诊断,纠正默认路径与证据边界表述 - 补充注册映射、失败前置检查和 provenance 回归测试 影响范围:Issue 5 的 RDMA requester 编排、预检、证据与文档;TCP 路径保持不变。 Refs Tencent#5
记录受控 DMA-BUF 实验基线与 fail-fast 验证器的独立提交边界,并为双节点能力、失败日志和验证器 transcript 生成 SHA-256 清单。 验证确认:2026-07-31 与 2026-08-01 两批 manifest 均通过完整性校验。 Refs Tencent#5
|
2026-08-01 根因诊断与 fail-closed 修复已推送(
验证: 证据:RESULTS.md · 2026-08-01 root-cause bundle 边界不变:当前仍是 |
在用户授权后,加载与 node1 驱动匹配的 nvidia_peermem,并使用空闲 GPU 0 完成单请求 Writer/Reader/recompute 闭环。 归档 PUT/GET 指标、输出摘要、RDMA 计数器、注册日志、清场状态与 SHA-256 manifest;报告将该结果严格限定为 Pythia 14M 兼容性证据,Qwen 7B 正式矩阵仍为 UNKNOWN。 验证:make check(46 passed);三份 manifest 通过;远端命中判定重算为 proven=true。 Relates Tencent#5
|
管理员授权后的最小 peermem GPUDirect RDMA Gate 已完成并推送至
证据级别仅升级为 验证: 证据入口:RESULTS.md · peermem raw bundle · machine verdict |
任务说明
本 PR 按仓库
src/test/issue5/README.md的验收描述,实现 Prefill KV Cache以存代算临界带宽模型,以及 Mooncake Store + vLLM 的 TCP/RDMA 可复现实验
与证据流水线。
Relates to #5,并关联领取/进展评论:
主要实现
no_hit、no_payload、never_profitable等边界,严格使用
B > Bcrit判定收益。统计与资源成本归一化。
OOM 均保留在分母。
字段变化。
session,不使用
pkill/killall;启动前检查同名 PID slot。ISSUE5_RDMA_GPU_REGISTRATION=dmabuf|peermem;按所选物理 GPU 校验 CUDAattributes 116/124 与 peer-memory 模块,再映射到 Mooncake
WITH_NVIDIA_PEERMEM=0|1。派生开关,不记录 token/secret。
verify-remote-hit:按 request ID 连接 recompute/Reader,逐项核对输出摘要、Store GET bytes/failed keys 与 external hit tokens;仅 HTTP 成功不能通过。
双机验证结果
环境:两台 A40 节点,
mlx5_0RoCE v2,vLLM 0.23.0,Mooncake Transfer Engine0.3.12.post1。
MEASURED_COMPATIBILITY,不是正式性能结论Bad address [14]/AddressNotRegistered,189/189 PUT keys 失败GPUDIRECT_RDMA_COMPATIBILITY,单请求功能证据UNKNOWNpeermem RDMA 闭环判据
在用户明确授权后,node1 加载了与 kernel/driver 匹配的
nvidia_peermem580.95.05,并仅使用空闲 GPU 0;GPU 2 上其他用户的进程未被触碰。
ISSUE5_RDMA_GPU_REGISTRATION=peermem与WITH_NVIDIA_PEERMEM=1。mlx5_0、GID index 3 上启动 RDMA,成功注册 8 GiBCUDA-backed KV arena 与 vLLM KV-cache segments;实验时
nvidia_peermemuse count=6。data-plane owner 50052 的 TCP 连接。
3,274,992 bytes,分别比 3,096,576-byte KV payload 高 5.86% / 5.76%。
proven=true:Reader 1/1 成功、输出摘要 1/1 与 fresh recompute一致、GET 失败键为 0、字节与 external hit tokens 均达到理论值。
Writer/Reader/recompute 的单次 TTFT 为 59.863 / 112.552 / 70.106 ms。样本量
仅 1,不报告 p50/p95、QPM、SLO 或 RDMA-over-TCP 加速比,也不外推到
Qwen 7B 或长上下文。
证据入口
验证
make check:46 tests passedgit diff --check:通过remote-20260731、remote-20260801和remote-20260801-peermem-smoke三批 SHA-256 manifest:全部通过
proven=true最新提交:
7a45d28:显式注册策略、能力预检、脱敏启动证据与根因修正161ed4d:双来源(实验 baseline / validator commit)SHA-256 manifestc5982c1:授权后 peermem GPUDirect RDMA 闭环证据、计数器与清场状态当前边界与后续 Gate
锁定 Qwen 7B 的 8K/32K/128K 与 open-loop 正式矩阵仍为
UNKNOWN。SLO 合规 QPM 与成本;本次单请求证据不作为性能结论。
50051/50052/8080/9003 均释放,GPU 0/1 为 0 MiB。
nvidia_peermem已按授权加载并在收尾时 use count=0;未擅自卸载共享主机模块。是否持久化或卸载,由主机管理员单独决定。